1
Парадигмальный сдвиг: от моделей для конкретных задач к LLM
PolyU COMP5511Lecture 10
00:00

Эволюция NLP: от фрагментированного ИИ к фундаментальным моделям

Определения

  • Фрагментированный ИИ: эпоха, определяемая дискретными специализированными нейронными архитектурами, созданными для отдельных задач, таких как разметка последовательностей или классификация.
  • Фундаментальная модель: единая монолитная архитектура трансформера, которая рассматривает все лингвистические задачи как генеративную последовательность текст-в-текст $x \rightarrow y$.

Основные концепции

  • Архитектурная консолидация: Исторически NLP требовал специализированных конвейеров (Bi-LSTM для NER, CNN для анализа тональности). LLM разрушают эти «силосы», объединяя их в единый каркас, где одни и те же веса используются для каждой задачи.
  • Единый интерфейс: LLM заменяют специализированные «выходные головы» (например, Softmax на 3 класса) интерфейсом на естественном языке. Входы и выходы всегда являются строками, что позволяет модели интерпретировать намерение а не формат.
  • Перенос знаний: Традиционные модели были «чистым листом» для каждой задачи. LLM отдают приоритет обобщению прежде всего, где конкретные задачи — это лишь применение предсуществующего устойчивого внутреннего представления языка.

Исторический контекст

  • До 2018 года: Изоляция задач требовала обучения отдельных моделей с различными функциями потерь $\mathcal{L}_{task}$.
  • Современная эпоха: Парадигма «Текст-в-текст» позволяет одной модели (например, Llama-3) переключаться между задачами с помощью zero-shot или few-shot подсказок.
Традиционный ИИ$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$Эпоха фундаментальных моделейПодсказка + $x$LLM$f(p, x) \rightarrow y_{str}$Строка $y$
Сравнение реализации на Python